Type: entity
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: papergenerative-modelstext-to-imageAI工程

Zero-Shot Text-to-Image Generation (2021 论文)

概述

提出 DALL-E 文生图模型的论文,首次展示 AI 可以根据自然语言描述生成前所未有的图像。

关键内容

  1. 离散 VAE + Transformer:使用离散 VAE 将图像编码为 token,与文本 token 拼接后训练 Transformer 生成图像。
  2. 组合泛化DALL-E 可以生成训练集中从未出现过的概念组合,如"穿宇航服的骑马"。
  3. AI 艺术开创:开启了 AI 生成图像的新领域,后续的 Stable DiffusionDALL-E 2 均受其启发。

来源

相关